NLP 的演变:从碎片化 AI 到基础模型
定义
- 碎片化 AI:一个由离散、专用的神经架构所定义的时代,这些架构针对序列标注或分类等单一任务而设计。
- 基础模型:一种统一、单体式的 Transformer 架构,将所有语言问题视为生成式文本到文本序列 $x \rightarrow y$。
核心概念
- 架构整合: 历史上,NLP 需要定制的流水线(用于 NER 的 Bi-LSTM、用于情感分析的 CNN)。LLM 将这些孤岛合并为单一主干,其中相同的权重用于每一项任务。
- 统一接口: LLM 用自然语言接口取代了专用的"输出头"(例如 3 类 Softmax)。输入和输出始终是字符串,使模型能够理解 意图 而非 格式。
- 知识迁移: 传统模型对每项任务都是"白板"。LLM 优先考虑 泛化优先,其中特定任务仅是预先存在的、稳健的内部语言表征的应用而已。
历史背景
- 2018 年之前: 任务隔离需要使用不同的损失函数 $\mathcal{L}_{task}$ 训练不同的模型。
- 现代时期: "文本到文本"范式允许单一模型(例如 Llama-3)通过零样本或少样本提示在不同任务间切换。
Python 实现对比
